1
パラダイムシフト:タスク特化型モデルからLLMへ
PolyU COMP5511Lecture 10
00:00

NLPの進化:分散型AIから基盤モデルへ

定義

  • 分散型AI:系列ラベリングや分類などの個別タスク専用に設計された、個別の特殊化されたニューラルアーキテクチャによって特徴づけられる時代。
  • 基盤モデル:すべての言語問題を生成的テキスト間シーケンス $x \rightarrow y$ として扱う、統合された単一構造のTransformerアーキテクチャ。

コア概念

  • アーキテクチャの統合: 歴史的に、NLPはカスタムされたパイプラインを必要としていました(NER用のBi-LSTM、感情分析用のCNNなど)。LLMはこれらのサイロを単一のバックボーンに統合し、すべてのタスクで同じ重みが使用されます。
  • 統合インターフェース: LLMは特殊化された「出力ヘッド」(例:3クラスのSoftmax)を自然言語インターフェースに置き換えます。入力も出力も常に文字列であり、モデルは 意図 ではなく 形式を解釈できます。
  • 知識の転移: 従来のモデルは各タスクに対して「白紙の状態」でした。LLMは 汎化優先を重視し、具体的なタスクは、事前に獲得された強固な言語の内部表現を適用するだけにすぎません。

歴史的背景

  • 2018年以前: タスクの分離には、異なる損失関数 $\mathcal{L}_{task}$ を持つ個別のモデルのトレーニングが必要でした。
  • 現代: 「Text-to-Text」パラダイムにより、単一のモデル(例:Llama-3)がゼロショットまたはフューショットのプロンプティングでタスクを切り替えることができます。
従来のAI$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$基盤モデル時代プロンプト + $x$LLM$f(p, x) \rightarrow y_{str}$文字列 $y$
Python実装の比較